Appearance
Scale dichotomization reduces customer racial discrimination and income inequality
Summary
Problem: 在线平台中顾客评价普遍存在种族歧视,导致非白人工人获得更低评分和收入,但现有干预措施主要针对雇主(如招聘政策、隐性偏见培训),不适用于顾客评价场景。本文旨在填补这一空白,探索一种面向顾客的结构性解决方案。 Approach: 作者提出将常用的五星评分量表改为二分制(点赞/点踩)量表,认为二分制能引导评价者只关注“好”与“坏”的绩效区分,从而抑制现代种族主义信念(微妙歧视)在评分中的表达。研究采用准自然实验(研究1,平台外生改变评分量表)和三个预注册实验(研究2-4)及八项补充研究来验证机制和稳健性。 Finding: 研究1发现,在五星制下,非白人工人获得最高评分的概率显著低于白人工人(83.4% vs 86.9%),且非白人工人每赚1美元时白人工人赚约1.10美元;改为二分制后,评分差异立即消失(95.4% vs 95.9%,无显著差异),且仅使用二分制的新工人收入差距被消除。研究2-4表明,二分化的平等化效应在持有现代种族主义信念的评价者中最强,机制是二分制减少了评价者将个人信念纳入评分的机会。 Significance: 本研究为减少在线劳动市场中顾客的微妙种族歧视提供了首个可落地的结构性干预方案,对评价过程、种族不平等和平台设计文献均有重要贡献,并具有直接的政策和实践意义。
Theoretical Framework
- Theoretical tradition: 社会学中的评价过程理论(evaluation processes)与社会心理学中的现代种族主义/微妙歧视理论(modern racism / subtle discrimination)。
- Prior theories built upon: 现代种族主义理论(contemporary racism theories,如McConahay等)、微妙歧视理论(subtle discrimination,如Jones等)、评价结构对偏见影响的研究(如评分量表点数变化影响性别歧视的研究,Rivera & Tilcsik)、测量工具设计影响评价者判断的研究。
- Causal mechanism: 多点评分量表(如五星制)为持有现代种族主义信念的评价者提供了“微妙降级”的空间(如给表现好的少数族裔打4星而非5星),且不违背其“非偏见”自我认知;二分制迫使评价者在“好”与“坏”之间做明确选择,给表现好的少数族裔“点踩”会直接挑战其非偏见自我形象,从而抑制歧视表达。
- Key assumptions: 大多数评价者并非公开的种族主义者,且不希望被视为有偏见;现代种族主义信念以微妙、非敌意的方式表达;评价者会理性地维护自我形象;二分制的“好/坏”二元区分信号能覆盖个人信念。
- Theoretical move: 本文扩展了现有理论——将评价结构干预从“减少量表点数”(如10点改6点)推进到“二分化”这一极端形式,并首次将现代种族主义理论应用于顾客评价场景,提出二分制通过限制微妙歧视表达来消除种族差异。
- Scope conditions: 理论适用于存在微妙歧视的评价场景(如在线平台顾客评价);作者指出可能推广到其他受当代歧视影响的群体(如女性、残障人士),但本研究仅聚焦种族;干预效果依赖于评价者持有现代种族主义信念(而非公开敌意种族主义)。
Research Design
本研究为混合方法设计,包含一个准自然实验(研究1)和三个预注册实验(研究2-4)及八项补充研究。
- 研究1:准自然实验,单位是“提交的评分”和“完成的工作”。自变量为工人感知种族(非白人=1,白人=0)和评分量表类型(五星制=0,二分制=1);因变量为“最高评分”(五星或点赞=1,否则=0)和“工人收入”(标准化收入)。平台外生地将五星制改为点赞/点踩制。
- 研究2:预注册在线实验,2×2设计(工人种族:白人 vs 非白人;评分量表:五星 vs 二分制),因变量为参与者对四名工人的评分。测量参与者的现代种族主义信念(使用现代种族主义量表)。
- 研究3:预注册实验,检验机制——评价者认为量表允许纳入个人信念和偏好的程度。
- 研究4:招募持有现代种族主义信念的参与者,实验操纵二分评价过程(独立于量表点数减少)。
Data & Sample
- 研究1:来自美国/加拿大家庭服务平台ServicesConnect(化名)的行政数据,包含100,759个完成工作和69,971条顾客评分(55,713条在五星制时期,14,258条在二分制时期)。工人几乎全为男性(仅20名女性被排除)。时间跨度为评分量表变更前后。
- 研究2:652名在线调查参与者(Centiment平台,主要为营销和商业专业人士),随机分配到四组(白人/非白人 × 五星/二分制),参与者来自人口统计和地理位置平衡的样本。
- 研究3:1,435名参与者。
- 研究4:528名参与者(预先筛选持有现代种族主义信念者)。
- 补充研究:八项补充研究支持测量和设计选择。
Analytical Strategy
- 研究1:使用普通最小二乘回归(线性概率模型),因变量为“最高评分”(0/1)和“收入”(标准化)。关键模型包括:模型1(无控制)、模型2(加入工人经验、顾客经验、位置和类别固定效应)、模型3(加入顾客固定效应)。稳健标准误聚类在顾客层面。所有检验为双尾。额外分析包括:仅使用量表变更前后均有评分的顾客、仅使用变更前后30天内的评分、以及加入后180天内新工人的收入分析。
- 研究2-4:预注册实验,使用方差分析和回归分析,检验评分量表与工人种族的交互效应,并测量现代种族主义信念的调节作用。
- 稳健性检查:补充分析处理了替代解释、测量假设、模型设定等(见补充信息)。
Results & Findings
- 研究1(评分差异) :五星制下,非白人工人平均获得4.72星,白人工人4.79星(差异显著);非白人工人获得最高评分(5星)的概率为83.4%,白人86.9%。改为二分制后,非白人工人获得最高评分(点赞)的概率为95.4%,白人95.9%,差异不再显著。交互项(非白人×量表变更)显著为正,表明二分化消除了种族评分差距。这一结果在加入控制变量和顾客固定效应后依然稳健。
- 研究1(收入差异) :五星制下,非白人工人每赚91美分时白人工人赚1美元(同一服务类别内)。量表变更后,所有工人中收入差距虽减弱但仍存在(因老工人评分历史仍含五星制时期的歧视性评分);但仅使用二分制的新工人中,非白人与白人收入无显著差异。在变更前后180天内加入的工人样本中,非白人工人收入在变更后显著上升(+42.37),而白人工人收入无变化,种族收入差距被消除。
- 研究1(即时效应) :变更前30天内,非白人获得最高评分概率比白人低3.9个百分点(88.5% vs 92.4%);变更后30天内,差异消失(93.7% vs 94.1%),表明效应可归因于量表变更而非混淆因素。
- 研究2(因果验证与调节) :在控制工人质量完全相同的实验中,五星制下非白人工人获得评分显著低于白人;二分制下差异消失。二分化的平等化效应在持有现代种族主义信念的参与者中最强,支持理论预期。
- 研究3和4(机制) :提供证据表明二分制通过减少评价者将个人信念纳入评分的感知和机会来发挥作用;研究4独立操纵二分评价过程,进一步支持机制。
- 零结果与意外发现:研究1中,二分制下白人获得最高评分的概率(95.9%)略高于非白人(95.4%),但差异不显著;作者未发现二分制对白人评分有负面影响。收入分析中,老工人(量表变更前加入)的收入差距虽减弱但未完全消除,符合理论预期(历史评分仍影响收入)。
Limitations
- 研究1中量表变更是外生的但非随机化,无法完全排除未观测混淆因素(尽管即时效应和稳健性检验增强了因果推断)。
- 研究1中工人种族是基于感知编码(而非自我报告),可能存在测量误差。
- 研究1样本几乎全为男性工人,无法推广到女性工人。
- 研究2-4为在线实验,外部效度有限,且实验场景(阅读评论)与真实平台互动有差异。
- 作者未检验二分制对其他受歧视群体(如女性、残障人士)的效果,也未检验其他潜在机制。
- 收入分析中,老工人的历史评分仍影响收入,无法完全分离量表变更的长期效应。
- 研究2中为减少社会期望偏差而放弃知情同意程序,可能引发伦理考量(尽管机构审查委员会批准)。
Key Contributions
- 首次提出并验证了面向顾客的评分量表二分化干预,填补了现有干预仅针对雇主的空白。
- 通过准自然实验和预注册实验的混合设计,提供了因果证据表明二分制能消除顾客对非白人工人的微妙种族歧视。
- 将现代种族主义理论应用于评价结构设计,提出并验证了“二分制通过限制微妙歧视表达来减少偏见”的机制。
- 证明评分量表设计不仅影响评分,还直接影响工人收入不平等,具有显著的经济后果。
- 为在线平台提供了低成本、易实施的去偏见设计建议,对平台治理和政策制定有直接启示。
- 贡献于评价过程、种族不平等、组织行为学和计算社会科学等跨学科文献。
Key Claims
"We propose a customer-facing solution: changing to a two-point rating scale (dichotomization). Compared with the ubiquitous five-star scale, we argue that dichotomization reduces modern racial discrimination by focusing evaluators on the distinction between ‘good’ and ‘bad’ performance, thereby reducing how personal beliefs shape customer assessments." (Abstract) "Dichotomization eliminated customers’ racial discrimination whereby non-white workers received lower ratings and earned 91 cents for each US dollar paid to white workers for the same work." (Abstract) "We reason that this is because dichotomous scales discourage the expression of modern racist beliefs that manifest as subtle discrimination." (Introduction) "After the thumbs up/down scale was implemented, white workers received the highest ratings 95.9% of the time and non-white workers received it 95.4% of the time, with no evidence for a difference (t(14,256) = 1.23, P = 0.217)." (Study 1 results) "Among this set of workers, we see that there is no relationship between a worker’s perceived race and their income (Table 2, model 3). Non-white and white workers who were rated only on the thumbs up/down scale earned the same income when completing a similar job." (Study 1 income results)